-
Do World Action Models Generalize Better than VLAs? 论文精读精读 WAM 与 VLA 的鲁棒性对比:RoboTwin 2.0-Plus 和 LIBERO-Plus 如何用 7 类扰动检验视频时空先验、训练数据多样性与推理效率。
22 min read -
LingBot-VA 2.0 论文精读:原生视频-动作预训练如何服务通用机器人控制精读 LingBot-VA 2.0:以语义视觉-动作 tokenizer、因果 MoE DiT、Multi-Chunk Prediction 与异步闭环推理,实现可泛化的 video-action robot control。
17 min read -
LaWAM 论文精读:用潜空间世界模型预测机器人动作的视觉子目标精读 LaWAM:把 Latent Action Model 的前向解码器复用为 Latent World Model,在 DINOv3 特征空间预测动作相关的未来视觉子目标,兼顾动力学预见与低延迟控制。
17 min read -
DreamZero 论文精读:World Action Models are Zero-shot Policies精读 DreamZero:把 14B 视频扩散模型改造成同时预测未来视频与动作的 World Action Model,并分析其零样本泛化、跨本体迁移与 7Hz 实时控制。
19 min read